昨天我替 CareCall AI 定義了固定 JSON 與安全提示詞。正常範例看起來很順,但真實口語不會永遠完整,所以今天我刻意拿正常、過短、含糊、矛盾、答非所問、否定句、不適、求助、部分未回答與完全未回答十種情況壓力測試。
「有」只有一個字,卻不知道它在回答哪一題;「藥有吃,等一下,其實還沒吃」同時有肯定與否定;「我早上吃了稀飯」雖然出現「吃」,卻不是服藥資訊。這些句子顯示,AI 危險的錯誤不一定是 JSON 壞掉,而可能是格式正確、內容卻是猜出來的。
因此提示詞升級為 prompt/v2-tested。新版規定孤立短句不能自行配對題目,前後矛盾必須使用 null 並轉人工,答非所問不能成為證據,空白輸入則不呼叫 AI。驗證器也新增實際防線:每段 evidence 必須逐字存在於 sourceText,避免把「藥有吃」美化成原文不存在的「已依醫囑服藥」。
十類中只有正常完整案例不需要人工確認,其餘都保留缺漏並轉人工,或停止 AI 流程。這讓我理解,轉人工不是 AI 失敗的遮羞布,而是資訊不足時正確的產品結果。今天沒有呼叫外部模型,所以不能宣稱 AI 已穩定;這些是人工建立的預期輸出,用來驗證契約、提示詞與分流。先寫清楚什麼情況絕對不能猜,下一步串接時才有真正可檢查的標準。